logo

Data Engineer

РФ (удаленно)
до 350к gross (до ~305к net)
Откликнуться

Команда: интеграционные среды.

Стек технологий:
СУБД: PostgreSQL, MS-SQL, Oracle, ClickHouse, DB2, Tarantool, Elasticsearch, Hadoop (Impala, Hive).

Data Stack: Hadoop, S3, Impala, Hive, Spark, Iceberg, Kafka, Elasticsearch.

Языки программирования: Python (Pandas, NumPy, Matplotlib), C#, SQL.

Инструментарий: Git, Jira, Kubernetes.

Обязанности

  • Развитие интеграционной среды: разработка потоков подключения метаданных информационных систем к Единому интеграционному слою и витрине DMDC.
  • Автоматизация и шаблонизация: создание шаблонов в платформе управления метаданными для обеспечения подключения ключевых типов СУБД (PostgreSQL, Oracle, MS-SQL, ClickHouse, DB2, Elasticsearch, Tarantool).
  • Разработка инструментов автоматизации: проектирование Python-скриптов для автоматической генерации DDL/DML запросов и Airflow DAG для процессов загрузки и обслуживания данных.
  • Поддержка и оптимизация: исправление ошибок существующих потоков, а также разработка Airflow DAG для обслуживания таблиц Iceberg с применением кастомных операторов (оптимизация чтения при наличии значительного количества delete-файлов).
  • Модернизация витрины: доработка функциональности витрины DMDC для обеспечения полной поддержки возможностей каталога данных.
  • Документирование: подготовка и ведение проектной документации по результатам разработки.

Требования

  • Глубокая экспертиза в разработке на PySpark и написании сценариев Airflow.
  • Опыт работы с высоконагруженными распределенными системами обработки и хранения данных (Hadoop).
  • Практические навыки конфигурации и оптимизации Spark-приложений и управления ресурсами Spark.
  • Опыт работы со стеком: Streaming/Storage/Messaging: Spark Streaming, Iceberg, Kafka, S3.
  • Навыки работы с контейнеризацией и оркестрацией в среде Kubernetes (K8s).
  • Опыт проведения нагрузочного тестирования систем обработки данных.
  • Экспертное владение SQL и навыками оптимизации сложных запросов.
  • Знание основ математической статистики, анализа данных и основ машинного обучения (PyTorch, TensorFlow).
  • Умение работать в условиях распределенных систем и обеспечивать консистентность данных при автоматическом определении типов схем.

Условия

Развитие и обучение

Проекты для крупного бизнеса, внутренние митапы и разговорные клубы английского языка

Забота и поддержка

Служба заботы о сотрудниках и индивидуальное сопровождение каждого коллеги на всех этапах развития в компании. А еще — ДМС со стоматологией и регулярная обратная связь

Комфорт

Работа в аккредитованной IT-компании, зарплата по рынку, техника для работы и человекоцентричный подход, где сотрудник = внутренний клиент компании

Драйвовое комьюнити

Команда прокаченных специалистов, внутренние события и уникальная корпоративная культура с маскотом IT-тигроми поддерживающим комьюнити

Расскажите об этой вакансии в соцсетях

Отклик на вакансию:

Я даю согласие на обработку перс. данных в соответствии с политикой конфиденциальности Outlines Tech